digital base
プロダクトドキュメントお知らせ会社概要

お問い合わせ

ご質問やご相談など、お気軽にお問い合わせください。

デジタルベース株式会社

〒106-0047
東京都港区南麻布3-20-1 5階

サイトメニュー

  • トップページ
  • プロダクト
  • ドキュメント
  • 最新ニュース
  • 記事一覧
  • 会社情報

お問い合わせ

  • info@digital-base.co.jp

NVIDIA Inception Program / Intel Partner ISV /
NTTPC Innovation LAB

© デジタルベース株式会社. All rights reserved.
記事一覧に戻る
2025.11.07ハードウェア

ローカルLLM向けGPU接続インターフェース比較|PCIe直挿しとThunderbolt eGPUの実効帯域と性能差

社内LLM基盤の構成選定に向けて、PCIe直挿しとThunderbolt eGPUの接続帯域、LLM推論のデータフロー、CPUメモリへの退避やGPU間通信による影響を整理します。

デジタルベース株式会社

ローカルLLM向けGPU接続インターフェース比較|PCIe直挿しとThunderbolt eGPUの実効帯域と性能差

概要

社内LLM基盤の構成選定では、GPUの性能に加えて、ホストとの接続方式を確認する必要があります。デスクトップのPCIeスロットへの直挿しと、ノートPCや小型筐体(NUCクラス)で利用するThunderbolt/USB4経由のeGPUでは、接続帯域とレイテンシが異なります。

DigitalBaseが技術資料を整理した結果をもとに、以下の観点を解説します。

  • PCIe直挿しとThunderbolt eGPUの接続帯域
  • LLM推論におけるデータ転送の特徴
  • CPUメモリへの退避やGPU間通信を考慮した構成選定

PCIeとThunderboltの基本スペック比較

帯域の理論値を把握する

接続方式ごとの物理帯域の理論値を整理します。

PCIe(デスクトップでの標準接続)

PCI Express(片方向・x16)の理論帯域はおおよそ以下のとおりです。

規格レーン数理論帯域(片方向)
PCIe 3.0x16約 31.5 GB/s
PCIe 4.0x16約 63.0 GB/s
PCIe 5.0x16約 126.0 GB/s

近年のコンシューマGPU(RTX 40/50シリーズなど)は、物理的にはx16スロットでも電気的にはx8動作となる構成が少なくありません。その場合、**PCIe 4.0 x8 はおおむね PCIe 3.0 x16 と同等(約32GB/sクラス)**として見積もります。

Thunderbolt 3 / 4 / 5(eGPUの主流接続)

Thunderboltは1本のケーブルでPCIeとDisplayPortなどをトンネリングする仕様であり、カタログ値の40Gbps/80Gbps/120GbpsがそのままPCIeデータ帯域として使えるわけではありません。GPU用途で押さえるべきポイントは以下です。

  • Thunderbolt 3: 公称40Gbps(双方向)。PCIeとしては最大4レーンのPCIe 3.0(32Gbps)をトンネリング可能ですが、実効PCIeデータ帯域はオーバーヘッド込みで約21〜25Gbps程度とされています。
  • Thunderbolt 4: 同じく40Gbps。常にPCIe 3.0 x4の32Gbpsをデータに利用可能で、TB3のようなビデオ優先の固定予約がありません。
  • Thunderbolt 5: 最大120Gbps(ブーストモード)。ただしGPU用のPCIe帯域としてはx4相当にとどまり、デスクトップのPCIe x16には届きません。

GPUに供給できる実効帯域という観点では、概ね次のとおりです。

接続実効PCIe帯域のイメージ
PCIe 4.0 x16約 63 GB/s
PCIe 4.0 x8約 32 GB/s
Thunderbolt 3/4 eGPUPCIe 3.0 x4 相当(約 4 GB/s)
Thunderbolt 5 eGPUPCIe 4.0 x4 相当(ただしプロトコルオーバーヘッドあり)

つまり、Thunderbolt eGPUはGPU本体がハイエンドであっても、接続帯域はx4相当にとどまるという前提で設計を考える必要があります。


ローカルLLM/生成AIでの影響をどう評価するか

LLM推論では、モデル重みやKVキャッシュの配置によって、接続帯域の影響が異なります。

LLM推論のデータフローの特徴

多くのLLM推論は、おおむね次の流れで進みます。

  1. モデル重み(数GB〜数十GB)を起動時に一度だけVRAMにロードします。
  2. 推論中は、トークナイズ済みの入力と中間状態(KVキャッシュ)をほぼVRAM内で更新・参照します。
  3. CPU側とのやり取りは入力テキストと出力トークン列が中心で、データ量は比較的少なくなります。

したがって帯域を最も消費するのは起動時のモデルロードであり、推論ループでは、インターフェース帯域よりもGPUの演算性能とVRAM帯域のほうが支配的になるケースが多くなります。

Thunderboltの帯域がボトルネックになる条件

逆に、以下のケースでは帯域の影響が顕在化します。

  • VRAMに収まりきらない大規模モデル: 重みの一部やKVキャッシュをCPUメモリ側へ退避している場合、毎トークンごとにThunderbolt越しの転送が発生し、スループットが大きく低下する可能性があります。
  • マルチGPU/分散推論でGPU間通信をホスト経由で行う構成: GPU間のAllReduceなどの通信がすべてx4帯域に乗るため、PCIe直挿しやNVLink構成と比べて明確にスケールしにくくなります。
  • 大量のEmbedding計算とCPU側データベースの連携: 1リクエストあたりのトークン数は少なくても、ベクトルやデータの往復頻度が高い場合、Thunderbolt側のI/Oの影響が顕在化します。

3点目はRAG基盤で特に注意すべき観点です。Embedding生成とベクトルDB(pgvector/HNSWなど)への問い合わせが密に連携する構成では、接続帯域がスループットの上限を規定する場面が出てきます。


PCIe直挿し vs Thunderbolt eGPU|ローカルLLM視点の整理

ここまでの情報を、ローカルLLM/生成AI用途に絞って整理します。

接続方式ごとの向き・不向き

Thunderbolt eGPUが適するケース

  • すでにThunderbolt 3/4/5対応のノートPCやNUCを保有している
  • 扱うモデルが7B〜13Bクラス中心で、VRAM内に収まる
  • 主用途がLLM推論・軽量なLoRA学習・コード補完などである

PCIe直挿し(一体型ワークステーション)が必須に近いケース

  • 30B〜70Bクラス以上のモデルを常用する
  • Stable Diffusionや動画生成など、帯域依存の強いワークロードが主体である
  • マルチGPU構成でスケールさせる(NVLinkやPCIeスイッチを活用する)
  • サーバ用途で24時間稼働させる(Thunderboltはホットプラグ前提のコンシューマ寄り設計)

まとめ

LLM推論の構成選定では、モデル重みとKVキャッシュがVRAMに収まるか、CPUメモリとの転送やGPU間通信が発生するかを確認する必要があります。VRAM内で処理が完結する場合は、接続帯域よりもGPUの演算性能とVRAM帯域が支配的になるケースが多くなります。

大規模モデルやマルチGPUを利用する構成では、十分なVRAMを備えたGPUのPCIe直挿しを中心に検討します。GPU間の接続に加え、大容量・高速NVMe、電源、冷却を含めて構成を選定することが重要です。

下記のお悩みなら、ご相談ください

PoC から商用化に進むには、次の 3 点が必要になります。統合型 AI エージェント基盤「DigitalBase」は、 これらを 1 つの製品で提供しています。お気軽にご相談ください。